- /
- Showcases/
- Fallstudie - CEREBRA, eine integrierte Data-Engineering-Plattform für die Hirnforschung/
Fallstudie - CEREBRA, eine integrierte Data-Engineering-Plattform für die Hirnforschung
Inhaltsverzeichnis
Forschungskooperationen benötigen eine Infrastruktur nicht nur zur Speicherung von Daten, sondern auch zur Verwaltung von Metadaten, Provenienz, Zugriffsberechtigungen und Arbeitsabläufen, die Daten nutzbar und wiederverwendbar machen. Da kooperative Forschungsprojekte über verschiedene Gruppen und Institutionen verteilt sind, muss diese Infrastruktur zudem unterschiedliche Tools und Systeme miteinander verbinden und gleichzeitig den Anforderungen einzelner Projekte und wissenschaftlicher Anwendungen gerecht werden.
Im Rahmen von ABCD-J bietet CEREBRA eine konkrete Umsetzung dieses Ansatzes für die Hirnforschung, die vom Forschungszentrum Jülich und seinen Partnern betrieben wird. Es wird vom Institut für Neurowissenschaften und Medizin - Gehirn und Verhalten (INM-7) betrieben und auf der Jülich Supercomputing Centre Cloud gehostet, vereint CEREBRA eine Reihe von Open-Source-Technologien aus dem ABCD-J-Software-Stack für das kollaborative (Meta-)Datenmanagement zusammen. Es bietet eine modulare technische Grundlage, die an verschiedene Forschungsgemeinschaften, Datenmodelle, Zugriffsanforderungen und Arbeitsabläufe angepasst werden kann.
Die Plattform #
CEREBRA (https://cerebra.fz-juelich.de/) vereint mehrere interoperable Komponenten, die verschiedene Aspekte des Data Engineering abdecken:
- Forgejo-aneksajo bietet eine Infrastruktur für die Zusammenarbeit bei der Verwaltung von Code und Daten und erweitert Forgejo durch die Unterstützung großer Dateien mittels git-annex.
- DataLad und git-annex unterstützen die Verwaltung großer, versionierter Datenmengen sowie den reproduzierbaren Zugriff auf Datensätze.
- Dump Things Service bietet strukturierte Metadatenspeicherung und Backend-APIs.
- shacl-vue stellt benutzerorientierte Oberflächen zur Eingabe und zum Abruf von Metadaten auf der Grundlage gemeinsamer Schemata bereit.
Zusammen bilden diese Komponenten einen gemeinsamen technischen Stack, der für verschiedene Forschungsgruppen und Anwendungsfälle bereitgestellt und konfiguriert werden kann.
Daten und Metadaten verknüpfen #
Eine Data-Engineering-Plattform muss zwei miteinander verbundene Fragen miteinander verknüpfen: Welche Forschungsdaten gibt es? und Wie kann man tatsächlich auf diese Daten zugreifen und sie nutzen? Anstatt (Meta-)Datenmanagement und Datenermittlung als getrennte Systeme zu betrachten, zeigt CEREBRA, wie diese Funktionen zu einer integrierten Forschungsinfrastruktur verbunden werden können.
Gemeinsam genutzte Metadatenmodelle können festlegen, welche Informationen erfasst und wie diese strukturiert werden. Diese Informationen lassen sich dann auf übergeordnete semantische Modelle abbilden und bilden so die Grundlage für die Anbindung lokaler Dateninfrastrukturen an externe Such- und Wissenssysteme, darunter den Helmholtz Knowledge Graph.
Ebenso lassen sich domänenspezifische Dienste in die Plattform integrieren, um die Möglichkeiten zur Erschließung und Nutzung von Datensätzen zu erweitern. Für die Hirnforschung umfasst dies die Anbindung von CEREBRA an Dienste wie Neurobagel und EBRAINS.
Die Bedeutung #
CEREBRA veranschaulicht mehrere Grundsätze, die den Kern der ABCD-J-Plattform bilden:
- Offene Technologien ermöglichen es Forschungsgemeinschaften, auf bestehender Software aufzubauen und diese zu erweitern, anstatt von proprietären Plattformen abhängig zu sein.
- Selbst gehostete Infrastruktur gibt den Gemeinschaften mehr Kontrolle über ihre Daten, Dienste und Arbeitsabläufe.
- Gemeinsame Metadatenmodelle bieten eine gemeinsame Sprache zur Beschreibung von Forschungsressourcen und lassen sich gleichzeitig an individuelle Anwendungsfälle anpassen.
- Wiederverwendbare Komponenten ermöglichen den Einsatz derselben technischen Bausteine in verschiedenen Projekten und Institutionen.
- Interoperabilität verbindet lokale Forschungsinfrastrukturen mit anderen Tools, Diensten und Wissenssystemen.
Ein wichtiger Aspekt von CEREBRA ist, dass es nicht darauf ausgelegt ist, auf eine einzige Forschungsgruppe oder eine einzige Konfiguration beschränkt zu sein. Zu den derzeitigen und geplanten Nutzern zählen Forschungsgruppen innerhalb des Forschungszentrums Jülich (FZJ) Institut für Neurowissenschaften und Medizin (INM) sowie gemeinsame Forschungsinitiativen wie TRR379 und SFB1451 und weitere Forschungsaktivitäten des FZJ. Derselbe zugrunde liegende Stack kann diese verschiedenen Gemeinschaften und ihre lokalen Anforderungen unterstützen, ohne dass für jeden Anwendungsfall eine separate technische Infrastruktur entwickelt und gewartet werden muss.
Dieser Ansatz ebnet den Weg für einen breiteren Einsatz innerhalb des FZJ und der Helmholtz-Gemeinschaft sowie möglicherweise auch in externen Forschungsumgebungen. Insbesondere kann CEREBRA als technische Komponente in der Zusammenarbeit mit umliegenden Universitätskliniken dienen und damit eine Grundlage für die Vernetzung der ABCD-J-Forschungsinfrastruktur mit Partnern aus Klinik und Forschung schaffen. Dadurch entsteht eine Brücke zwischen dem derzeitigen Einsatz in der Hirnforschung und künftigen Data-Engineering-Aktivitäten, die darauf abzielen, verteilte Forschungsgemeinschaften über Gruppen, Institutionen und wissenschaftliche Disziplinen hinweg zu unterstützen.
Es gibt hier noch keine Beiträge.